「感知器值得研究,儘管它有嚴重的限制——甚至正因為如此。」
—— 馬文・明斯基與西摩・派普特,1969 年,《Perceptrons》,節譯。
上一篇,我們把紅點放在左上與右下,藍點放在另外兩個角落,請感知器畫一條線,把兩種顏色分開。
它畫錯了。調整權重,再畫一次,只是換成另一個點站錯邊。
多給幾次例子也沒用。不是它偷懶,而是你拿著尺,確實找不到那條線。
這個四角問題,今天常用 XOR 來說明。把兩個輸入想成開關:剛好只有一個打開時,答案是 1;兩個都開或都關,答案是 0。
四種情況排在平面上,0 與 1 正好交錯。單一感知器不管怎麼調整,都只能畫出一條直的邊界。
不是例子太少,也不是訓練不夠久。它能畫出的答案裡,從一開始就沒有這一種。
那麼,這是感知器的限制,還是整條神經網路路線的判決書?
1969 年,馬文・明斯基與西摩・派普特出版了《Perceptrons》。
距離羅森布拉特公開展示感知器,已經過了十多年。當初媒體談的是機器將來可能看見、說話,甚至產生原創想法;這本書問的卻冷靜得多:
一個感知器,究竟能計算什麼?
兩位作者不只拿幾張圖試試看,而是把感知器當成數學對象,研究它處理奇偶性、圖案是否連通等問題時的能力。
結論並不好看。
在他們分析的感知器裡,局部訊號最後仍要由一次加權判斷整合。有些看似簡單的分類,需要的結構會大得不切實際;有些則不是這類簡單配置能完成的。
調整權重可以幫它找到「存在的那條線」,不能讓不存在的線突然出現。
這份批評是有價值的。它把「我覺得這方法很有潛力」,換成「它在哪些條件下做得到」。
只是,能力邊界一旦畫出來,另一個問題也跟著出現:
邊界圈住的,究竟是這個模型,還是整個未來?
回到交錯的四個點。
一條線分不開,但可以先用兩條線,各自切出一部分,再讓後面的單元把結果組合起來。
這就是多層網路的關鍵:前面的「隱藏層」先把原始問題換一種表示,後面的單元再進行分類。XOR 不是從此變簡單,而是換到了一個可以分開的空間。
所以,《Perceptrons》的證明不能直接套到所有多層神經網路。明斯基與派普特知道多層結構能表達更多東西,卻對它能否發展成實用的學習系統非常悲觀。他們直言,自己的直覺是多層延伸可能相當「貧瘠」,但也把釐清或推翻這個判斷列為研究問題。
當時的困難也是真的:多加幾層不等於知道怎麼訓練。最後輸出與標準答案一比,可以算出整個網路錯了多少;藏在中間的每個連結,卻沒有一張直接寫給它的標準答案。
後來,感知器研究失去不少資源與注意力。但把這段歷史寫成「兩個人出了一本書,隔天神經網路就死了」,未免太像替複雜歷史畫一條直線。
運算能力、遲遲沒有兌現的應用、研究路線之間的競爭,都在影響資源流向;而神經網路相關工作也沒有完全停止。
真正值得記住的是:一個正確的限制,如果被放大到超出它證明的範圍,也可能帶來錯誤的結論。
當年,人們容易把一項限制放大成整條路失敗;今天,也容易把一項進步放大成每種能力都進步。
2026 年 9 月 14 日,《Scientific Reports》刊出一項研究。研究者比較 11 個不同規模與架構的視覺模型,除了看分類表現,也把五種事後解釋方法產生的熱區,拿去和人工標記的目標區域比對。
結果顯示,在這些資料與測量方法下,增加模型深度與參數量,並沒有穩定改善解釋的定位品質。有些模型分類表現很好,解釋熱區卻未必對準標記區域。
這不表示大型模型沒有用,也沒有證明模型「不懂圖片」。研究只測量一件更具體的事:模型規模增加時,事後產生的視覺解釋,有沒有更準確地對上指定區域。
預測準確、模型更大、解釋更可靠,是三件可能相關,卻不能直接畫上等號的事。
方向雖然相反,問題卻一樣:都把某一項結果,擴張到沒有測過的能力。
看到限制時,先問清楚:是哪一種模型、哪一項能力、在哪些條件下的限制?
不然,我們很容易在兩個極端之間擺盪:成功一次,就以為什麼都能做;失敗一題,就宣布整條路走不通。
單層感知器確實分不開 XOR;多層結構卻能表示這種分類。單一模型的限制,不是整個方向的終點。
限制沒有消失,而是幫研究者指出該改哪裡:不是重播同一批例子,而是增加能重新表示問題的中間層。
可是一旦加上隱藏層,上一回那套「答錯就調整權重」立刻遇到新麻煩。
最後答案錯了,究竟是哪一層、哪一條連結該負責?每個中間單元,又該改多少?
系統已經算得出最後錯了多少。
現在,它得想辦法把這個錯誤,一層一層傳回去。